Day 2 提過,Agent 系統需要「任務品質層級」的指標,而這些傳統 APM 工具沒有現成欄位,需要自己定義。這篇提供一組實用的起手式。
任務成功率:完成任務的執行 ÷ 總執行數。定義「成功」是設計這個指標最難的部分——是使用者沒有再追問就算成功?是 Agent 自認完成就算成功?建議明確定義並寫進文件,因為不同定義會導致完全不同的數字。
人工介入率:需要轉接人工或需要人工審核的比例。這個指標的變化趨勢往往比絕對值更有意義——突然上升代表某些東西變了(呼應 Day 1 開場的客服 Agent 場景)。
平均步數:完成一次任務平均花了幾步。呼應 Day 16 提過的「步數太多」問題,這個指標能反映 Agent 的決策效率。
工具呼叫失敗率:依工具分組統計。這個指標的價值在於區分「Agent 判斷錯誤」與「工具本身有問題」——如果某個工具的失敗率突然飆高,那多半是工具端的問題,不是 Agent 變笨了。
工具選擇分布:各工具被呼叫的比例。分布的異常變化是一個有用的訊號——例如某個原本很少用的工具突然被大量呼叫,值得追查。
「幻覺率」很難直接量測(因為需要判斷輸出是否正確),實務上多半用代理指標近似:
檢索一致性分數:在 RAG 場景下,比對輸出內容與檢索到的來源文件的一致程度。一致性低是幻覺的warning signal。
引用覆蓋率:輸出中有多少陳述能對應到明確的來源。
LLM-as-judge 抽樣評分:對一定比例的產出(不需要全部,抽樣即可)用另一個模型做品質評分。這種做法的成本考量是:評分本身也要花 Token,所以抽樣比例需要在覆蓋率與成本間取捨。
每次任務的 Token 成本:把 Week 3 Span 上的 gen_ai.usage.* 屬性聚合起來。
P95/P99 延遲:呼應 Day 16,別只看平均值。
💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。如果這篇對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。